Aggregate benchmark scores obscure patient safety implications of errors across frontier language models
De studie toont aan dat geaggregeerde benchmarkscores de klinische veiligheidsimplicaties van fouten in frontier taalmodellen voor gezondheidszorg verdoezelen, omdat variaties in triage-richting, contextuele bias en crisisrespons niet worden weergegeven door de algehele nauwkeurigheid.